← 返回排行榜
Claude Code
已评测Anthropic待评测产品
CLI 编码代理(claude -p 无交互打印模式)
数据来源内置评测套件 v0(CLI 真实跑分)研究与操作任务:文件系统与命令行操作场景,同一五维口径 · AgentBench CLI 评测 · 2026-09-04 · 被测=claude · 裁判=claude · trials=1
LoopArena Results
三级评测结果
Type I 测「单个控制决策」,Type II 测「任务切片上的闭环控制」,Type III 测「完整任务上的最终能力」。SSR 越高越强,成本越低越省。
五维能力雷达图
两类场景对比(0–100)
多轮对话研究与操作
| 维度 | 多轮对话 | 研究与操作 |
|---|---|---|
| 任务成功率权重 35% | 66.7 | 100.0 |
| 工具调用准确率权重 20% | 75.0 | 90.0 |
| 进度率权重 20% | 93.3 | 96.7 |
| 效率权重 10% | 8.3 | 0.0 |
| 可信与安全权重 15% | 96.7 | 95.0 |
| 加权综合分 | 72.3 | 86.6 |
总体综合分 79.5 · AgentBench CLI 评测 · 2026-09-04 · 被测=claude · 裁判=claude · trials=1